Deep Residual Learning for Image Recognition (2016 论文)
概述
何恺明、张祥雨、任少卿、孙剑于2015年发表的开创性论文,提出了残差学习框架和残差网络(ResNet),通过引入残差连接解决了深度神经网络的退化问题,使网络能够训练至152层以上。该论文获得了CVPR 2016最佳论文奖,并在ILSVRC 2015竞赛中取得多项冠军。
关键内容
-
退化问题(Degradation Problem):实验发现更深的网络(如56层)训练误差反而比浅层网络(如20层)更高,这不是过拟合而是优化问题——深层网络学不会恒等映射。在CIFAR-10数据集上,56层网络的训练误差显著高于20层网络。
-
残差学习公式:将目标映射重构为 H(x) = F(x) + x,网络只需学习残差 F(x) = H(x) - x。当最优解接近恒等映射时,将权重推向零比学习恒等变换更容易。这种设计使得网络在不需要额外变换时可以轻松学习到零映射。
-
两种残差块设计:
- BasicBlock(用于ResNet-18/34):包含两个3×3卷积层,结构简单。
-
Bottleneck(用于ResNet-50/101/152):采用1×1降维→3×3→1×1升维的结构,参数量比BasicBlock节省约40%(11 vs 18单位参数)。
-
ILSVRC 2015 成果:ResNet-152以3.57% Top-5错误率获得冠军,首次超越人类水平(约5.1%),同时获得目标检测、图像定位等多项冠军,以及COCO 2015检测任务冠军,成为史无前例的"五冠王"。
-
实验验证:论文通过在CIFAR-10上的实验展示了残差连接的效果。普通网络(Plain Network)在超过一定层数后出现明显的性能退化,而残差网络即使到1202层仍可训练。实验还表明残差函数的响应普遍较小,说明网络确实学习到了接近恒等映射的小扰动。
-
理论意义:残差连接提供了梯度高速公路,确保梯度可以直接流向浅层,解决梯度消失问题;使深层网络更容易训练;损失曲面更加平滑,便于优化器找到全局最优解。
来源
- raw/articles/ai-papers/machine-learning/13_resnet_2015.md — 原始笔记文件
- raw/articles/ai-papers/foundations/paper_05_resnet.md — 论文精读 #05:残差网络 ResNet
- https://arxiv.org/abs/1512.03385 — arXiv 论文原文
相关
- 残差网络(ResNet) — implements
- Kaiming He — author
- 微软亚洲研究院 — published_by
- 卷积神经网络(CNN) — extends
- ImageNet — tested_on
- 退化问题(Degradation Problem) — addresses
- 残差连接(Residual Connection) — introduces
- ILSVRC 2015 — achieves_results_on
- CVPR 2016 — awarded
- CIFAR-10 数据集 — tested_on